1
Introducción a la Visión por Computador y el Procesamiento Digital de Imágenes
PolyU COMP5511Lecture 8
00:00

Introducción a la Visión por Computador y el Procesamiento Digital de Imágenes

Visión por Computador es el campo de la inteligencia artificial que permite a las computadoras extraer información significativa de imágenes y videos digitales, intentando efectivamente cerrar la brecha semántica entre los datos brutos de píxeles y la comprensión a nivel humano. Procesamiento Digital de Imágenes sirve como capa fundamental para la Visión por Computador, centrándose en la manipulación y mejora de las señales de imagen mediante transformaciones píxel a píxel para preparar los datos para tareas interpretativas de mayor nivel.

Principios Clave

  • Representación de Datos: A nivel de máquina, una imagen es un tensor numérico en lugar de una imagen holística. Las imágenes en escala de grises son matrices 2D de valores de intensidad, mientras que las imágenes en color son tensores 3D que representan los canales Rojo, Verde y Azul (RGB) con dimensiones $H \times W \times 3$.
  • Transformación vs. Interpretación: El Procesamiento Digital de Imágenes se ocupa principalmente de operaciones de imagen a imagen, como la reducción de ruido, el enfoque o la ecualización del histograma. La Visión por Computador se centra en operaciones de imagen a conocimiento, como la clasificación de objetos, la localización y la segmentación.
  • El Paradigma de la Gráfica Inversa: La Visión por Computador puede considerarse el inverso de la Gráfica por Computador. Mientras que la gráfica busca generar un mundo visual a partir de modelos matemáticos, la visión busca recuperar estructuras 3D y etiquetas semánticas a partir de proyecciones 2D.
El Desafío Principal
El principal desafío en este campo es la Brecha Semántica, que es la desconexión entre los valores de píxeles de bajo nivel procesados por las máquinas y los conceptos de alto nivel percibidos por los humanos.
Implementación en Python
Pregunta 1
¿Qué proceso se clasifica como una operación de imagen a conocimiento?
Procesamiento Digital de Imágenes
Visión por Computador
Gráfica por Computador
Ecualización del Histograma
Pregunta 2
A nivel de máquina, ¿cuál es la estructura de datos de una imagen en color estándar?
Matriz 2D
Arreglo 1D
Tensor 3D / Canales RGB
Lista Enlazada
Caso de Estudio: Sistema de Diagnóstico Médico
Lee el escenario a continuación y responde las preguntas.
Un hospital está desarrollando un nuevo sistema automatizado de diagnóstico médico diseñado para analizar radiografías en busca de posibles fracturas óseas. El sistema procesa los datos brutos del sensor de la máquina de rayos X y genera un informe de diagnóstico para el radiólogo.
P
1. Si el sistema aplica mejora de contraste para hacer más claras las estructuras óseas, ¿es esto Procesamiento Digital de Imágenes (DIP) o Visión por Computador (CV)?
Respuesta:
Procesamiento Digital de Imágenes. La mejora de contraste es una transformación de imagen a imagen que mejora la calidad visual de la señal sin extraer significado semántico.
P
2. Si el sistema marca automáticamente un área específica como posible fractura, ¿qué tarea está realizando?
Respuesta:
Visión por Computador / Detección de Objetos. El sistema interpreta el contenido de la imagen para extraer conocimiento de alto nivel (localizar una fractura).
P
3. ¿Por qué es necesaria la reducción de ruido antes de ejecutar un algoritmo de detección?
Respuesta:
Para mejorar la calidad de la señal y reducir los falsos positivos en la fase de interpretación semántica. El ruido puede ser malinterpretado por los algoritmos de CV como características o bordes reales.